____ _ _ _ _
| _ \ ___ | |_ (_) _ __ ___ __| | (_) __ _
| |_) | / _ \ | __| | | | '_ \ / _ \ / _| | | | / _ |
| _ < | __/ | |_ | | | |_) | | __/ | (_| | | | | (_| |
|_| \_\ \___| \__| |_| | .__/ \___| \__,_| |_| \__,_|
|_|
- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b
ÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻÂŻ
Lineare Einfachregression
ââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââ
top
In der Statistik ist die lineare Einfachregression, auch einfache lineare Regression (kurz: ELR), selten univariate lineare Regression genannt, ein regressionsanalytisches Verfahren und ein Spezialfall der linearen Regression. Die Bezeichnung einfach gibt an, dass bei der linearen Einfachregression nur eine unabhängige Variable verwendet wird, um die ZielgrĂśĂe zu erklären. Ziel ist die Schätzung von Achsenabschnitt und Steigung der Regressionsgeraden sowie die Schätzung der Varianz der StĂśrgrĂśĂen.cite-ref-1[1]
Contents
⢠Das Modell
⢠Modellannahmen
⢠t -Tests
⢠Vorhersage
⢠Weblinks
⢠Literatur
⢠Einzelnachweise
ââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââââ
EinfĂźhrung in die Problemstellung
Das Ziel einer Regression ist es, eine abhängige Variable durch eine oder mehrere unabhängige Variablen zu erklären. Bei der einfachen linearen Regression wird eine abhängige Variable durch lediglich eine unabhängige Variable erklärt. Das Modell der linearen Einfachregression geht daher von zwei metrischen GrĂśĂen aus: einer EinflussgrĂśĂe X {\displaystyle X} (erklärende Variable, unabhängige Variable, Regressor) und einer ZielgrĂśĂe Y {\displaystyle Y} (abhängige Variable, erklärte Variable, Regressand). Des Weiteren liegen n {\displaystyle n} Paare ( x 1 , y 1 ) , ⌠⌠, ( x n , y n ) {\displaystyle (x_{1},y_{1}),\dotsc ,(x_{n},y_{n})} von Messwerten vor (die Darstellung der Messwerte ( x 1 , y 1 ) , ⌠⌠, ( x n , y n ) {\displaystyle (x_{1},y_{1}),\dotsc ,(x_{n},y_{n})} im x {\displaystyle x} - y {\displaystyle y} -Diagramm wird im Folgenden als Streudiagramm bezeichnet), die in einem funktionalen Zusammenhang stehen, der sich aus einem systematischen und einem stochastischen Teil zusammensetzt:
Y i = f ( x i ; β β 0 , β β 1 , ⌠⌠) â â systematische Komponente + Îľ Îľ i â â stochastische Komponente {\displaystyle Y_{i}=\underbrace {f(x_{i};\beta _{0},\beta _{1},\ldots )} _{\text{systematische Komponente}}+\underbrace {\varepsilon _{i}} _{\text{stochastische Komponente}}}
Die stochastische Komponente beschreibt nur noch zufällige EinflĂźsse (z. B. zufällige Abweichungen wie Messfehler), alle systematischen EinflĂźsse sind in der systematischen Komponente enthalten. Die lineare Einfachregression stellt den Zusammenhang zwischen der Einfluss- und der ZielgrĂśĂe mithilfe von zwei festen, unbekannten, reellen Parametern β β 0 {\displaystyle \beta _{0}} und β β 1 {\displaystyle \beta _{1}} auf lineare Weise her, d. h., die Regressionsfunktion f ( â
â
) {\displaystyle f(\cdot )} wird wie folgt spezifiziert:
f ( x i ; β β 0 , β β 1 ) = β β 0 + β β 1 x i {\displaystyle f(x_{i};\beta _{0},\beta _{1})=\beta _{0}+\beta _{1}x_{i}} (Linearität)
Dadurch ergibt sich das Modell der linearen Einfachregression als Y i = β β 0 + β β 1 x i + Îľ Îľ i {\displaystyle Y_{i}=\beta _{0}+\beta _{1}x_{i}+\varepsilon _{i}} . Hierbei ist Y i {\displaystyle Y_{i}} die abhängige Variable und stellt eine Zufallsvariable dar. Die x i {\displaystyle x_{i}} -Werte sind beobachtbare, nicht zufällige Messwerte der bekannten erklärenden Variablen x {\displaystyle x} ; die Parameter β β 0 {\displaystyle \beta _{0}} und β β 1 {\displaystyle \beta _{1}} sind unbekannte skalare Regressionsparameter und Îľ Îľ i {\displaystyle \varepsilon _{i}} ist eine zufällige und unbeobachtbare StĂśrgrĂśĂe. Bei der einfachen linearen Regression wird also eine Gerade so durch das Streudiagramm gelegt, dass der lineare Zusammenhang zwischen X {\displaystyle X} und Y {\displaystyle Y} mĂśglichst gut beschrieben wird.
BestimmtheitsmaĂ
â
Hauptartikel
:
BestimmtheitsmaĂ
Das BestimmtheitsmaĂ R 2 = 1 â â S Q R / S Q T {\displaystyle R^{2}=1-SQR/SQT} misst, wie gut die Messwerte zu einem Regressionsmodell passen (AnpassungsgĂźte). Es ist definiert als der Anteil der âerklärten Variationâ an der âGesamtvariationâ und liegt daher zwischen:
⢠0 % % {\displaystyle 0\,\%} (oder 0 {\displaystyle 0} ): kein linearer Zusammenhang und
⢠100 % % {\displaystyle 100\,\%} (oder 1 {\displaystyle 1} ): perfekter linearer Zusammenhang.
Je näher das BestimmtheitsmaĂ am Wert Eins liegt, desto hĂśher ist die âBestimmtheitâ bzw. âGĂźteâ der Anpassung. Ist R 2 = 0 {\displaystyle R^{2}=0} , dann besteht das âbesteâ lineare Regressionsmodell nur aus dem Achsenabschnitt β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} , während β β ^ ^ 1 = 0 {\displaystyle {\hat {\beta }}_{1}=0} ist. Je näher der Wert des BestimmtheitsmaĂ an 1 {\displaystyle 1} liegt, desto besser erklärt die Regressionsgerade das wahre Modell. Ist R 2 = 1 {\displaystyle R^{2}=1} , dann lässt sich die abhängige Variable Y {\displaystyle Y} vollständig durch das lineare Regressionsmodell erklären. Anschaulich liegen dann die Messpunkte ( x 1 , y 1 ) , ⌠⌠, ( x n , y n ) {\displaystyle (x_{1},y_{1}),\ldots ,(x_{n},y_{n})} alle auf der nichthorizontalen Regressionsgeraden. Somit liegt bei diesem Fall kein stochastischer Zusammenhang vor, sondern ein deterministischer.
Eine häufige Fehlinterpretation eines niedrigen BestimmtheitsmaĂes ist es, dass es keinen Zusammenhang zwischen den Variablen gibt. Tatsächlich wird nur der lineare Zusammenhang gemessen, d. h., obwohl R 2 {\displaystyle R^{2}} klein ist, kann es trotzdem einen starken nichtlinearen Zusammenhang geben. Umgekehrt muss ein hoher Wert des BestimmtheitsmaĂes nicht bedeuten, dass ein nichtlineares Regressionsmodell nicht noch besser als ein lineares Modell ist.
Bei einer einfachen linearen Regression entspricht das BestimmtheitsmaĂ R 2 {\displaystyle R^{2}} dem Quadrat des Bravais-Pearson-Korrelationskoeffizienten r x y {\displaystyle r_{xy}} (siehe BestimmtheitsmaĂ als quadrierter Korrelationskoeffizient).
Im oben genannten Beispiel kann die GĂźte des Regressionsmodells mit Hilfe des BestimmtheitsmaĂes ĂźberprĂźft werden. FĂźr das Beispiel ergibt sich fĂźr die Residuenquadratsumme und die totale Quadratsumme
S Q R = â â i = 1 6 ( y i â â y ^ ^ i ) 2 = 5 , 98 {\displaystyle SQR=\sum _{i=1}^{6}(y_{i}-{\hat {y}}_{i})^{2}=5{,}98\quad } und S Q T = â â i = 1 6 ( y i â â y ÂŻ ÂŻ ) 2 = 60 {\displaystyle \quad SQT=\sum _{i=1}^{6}(y_{i}-{\overline {y}})^{2}=60}
und das BestimmtheitsmaĂ zu
R 2 = 1 â â â â i = 1 6 ( y i â â y ^ ^ i ) 2 â â i = 1 6 ( y i â â y ÂŻ ÂŻ ) 2 = 1 â â 5 , 98 60 â â 0 , 90 {\displaystyle R^{2}=1-{\frac {\displaystyle \sum \nolimits _{i=1}^{6}(y_{i}-{\hat {y}}_{i})^{2}}{\displaystyle \sum \nolimits _{i=1}^{6}(y_{i}-{\overline {y}})^{2}}}=1-{\frac {5{,}98}{60}}\approx 0{,}90} .
Das heiĂt, ca. 90 % der Variation bzw. Streuung in Y {\displaystyle Y} kĂśnnen mithilfe des Regressionsmodells âerklärtâ werden, nur 10 % der Streuung bleiben âunerklärtâ.
Das Modell
Im Regressionsmodell werden die Zufallskomponenten mit Hilfe von Zufallsvariablen Îľ Îľ i {\displaystyle \varepsilon _{i}} modelliert. Wenn Îľ Îľ i {\displaystyle \varepsilon _{i}} eine Zufallsvariable ist, dann ist es auch Y i {\displaystyle Y_{i}} . Die beobachteten Werte y i {\displaystyle y_{i}} werden als Realisierungen der Zufallsvariablen Y i {\displaystyle Y_{i}} aufgefasst.
Daraus ergibt sich das einfache lineare Regressionsmodell:cite-ref-2[2]
Y i = β β 0 + β β 1 x i + ξ ξ i , i = 1 , ⌠⌠, n {\displaystyle Y_{i}=\beta _{0}+\beta _{1}\ x_{i}+\varepsilon _{i},\quad i=1,\dotsc ,n} (mit Zufallsvariablen) bzw.
y i = β β 0 + β β 1 x i + ξ ξ i , i = 1 , ⌠⌠, n {\displaystyle y_{i}=\beta _{0}+\beta _{1}\ x_{i}+\varepsilon _{i},\quad i=1,\dotsc ,n} (mit deren Realisierungen).
Bildlich gesprochen wird eine Gerade durch das Streudiagramm der Messung gelegt. In der gängigen Literatur wird die Gerade oft durch den Achsenabschnitt β β 0 {\displaystyle \beta _{0}} und den Regressions- bzw. Steigungsparameter β β 1 {\displaystyle \beta _{1}} beschrieben. Die abhängige Variable wird in diesem Kontext oft auch endogene Variable genannt. Dabei ist Îľ Îľ i {\displaystyle \varepsilon _{i}} eine additive stochastische StĂśrgrĂśĂe, die Abweichungen vom idealen Zusammenhang â also der Geraden â achsenparallel misst.
Anhand der Messwerte ( x 1 , y 1 ) , ⌠⌠, ( x n , y n ) {\displaystyle (x_{1},y_{1}),\dotsc ,(x_{n},y_{n})} werden die Regressionsparameter β β 0 {\displaystyle \beta _{0}} und die β β 1 {\displaystyle \beta _{1}} geschätzt. So erhält man die Stichproben-Regressionsfunktion y ^ ^ = β β ^ ^ 0 + β β ^ ^ 1 x {\displaystyle {\hat {y}}={\hat {\beta }}_{0}+{\hat {\beta }}_{1}x} . Im Gegensatz zur unabhängigen und abhängigen Variablen sind die Zufallskomponenten Îľ Îľ i {\displaystyle \varepsilon _{i}} und deren Realisierungen nicht direkt beobachtbar. Ihre geschätzten Realisierungen Îľ Îľ ^ ^ i {\displaystyle {\hat {\varepsilon }}_{i}} sind nur indirekt beobachtbar und heiĂen Residuen. Sie sind berechnete GrĂśĂen und messen den vertikalen Abstand zwischen Beobachtungspunkt und der geschätzten Regressionsgerade.
Modellannahmen
Um die Zerlegung von Y i {\displaystyle Y_{i}} in eine systematische und zufällige Komponente zu sichern sowie gute Schätzeigenschaften fĂźr die Schätzung β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} und β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} der Regressionsparameter β β 0 {\displaystyle \beta _{0}} und β β 1 {\displaystyle \beta _{1}} zu haben, sind einige Annahmen bezĂźglich der StĂśrgrĂśĂen sowie der unabhängigen Variable nĂśtig.
Annahmen ßber die unabhängige Variable
In Bezug auf die unabhängige Variable werden folgende Annahmen getroffen:cite-ref-auer49-3-0[3]
Die Werte der unabhängigen Variablen x i {\displaystyle x_{i}} sind deterministisch, d. h. sie sind fest gegeben
Sie kÜnnen also wie in einem Experiment kontrolliert werden und sind damit keine Zufallsvariablen (Exogenität der Regressoren). Wären die x i {\displaystyle x_{i}} Zufallsvariablen, z. B. wenn die x i {\displaystyle x_{i}} auch nur fehlerbehaftet gemessen werden kÜnnen, dann wäre Y i = β β 0 + β β 1 X i + ξ ξ i {\displaystyle Y_{i}=\beta _{0}+\beta _{1}X_{i}+\varepsilon _{i}} und die Verteilung von Y i {\displaystyle Y_{i}} sowie die Verteilungsparameter (Erwartungswert und Varianz) wßrden nicht nur von ξ ξ i {\displaystyle \varepsilon _{i}} abhängen E ⥠⥠( Y i ) = β β 0 + β β 1 E ⥠⥠( X i ) + E ⥠⥠( ξ ξ i ) {\displaystyle \operatorname {E} (Y_{i})=\beta _{0}+\beta _{1}\operatorname {E} (X_{i})+\operatorname {E} (\varepsilon _{i})} .
Mit speziellen Regressionsverfahren kann dieser Fall aber auch behandelt werden, siehe z. B. Regression mit stochastischen Regressoren.
Stichprobenvariation in der unabhängigen Variablen
Die Realisierungen der unabhängigen Variablen x 1 , ⌠⌠, x n {\displaystyle x_{1},\ldots ,x_{n}} sind nicht alle gleich.cite-ref-jw-4-0[4] Man schlieĂt also den unwahrscheinlichen Fall aus, dass die unabhängige Variable keinerlei Variabilität aufweist, d. h. x 1 = x 2 = ⌠⌠= x n = x ÂŻ ÂŻ {\displaystyle x_{1}=x_{2}=\ldots =x_{n}={\overline {x}}} . Dies impliziert, dass die Quadratsumme der unabhängigen Variablen â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 {\displaystyle \sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}} positiv sein muss.cite-ref-5[5] Diese Annahme wird im Schätzprozess benĂśtigt.
Annahmen ßber die unabhängige und abhängige Variable
Der wahre Zusammenhang zwischen den Variablen x i {\displaystyle x_{i}} und y i {\displaystyle y_{i}} ist linear
Die Regressionsgleichung der einfachen linearen Regression muss linear in den Parametern β β 0 {\displaystyle \beta _{0}} und β β 1 {\displaystyle \beta _{1}} sein, kann aber nichtlineare Transformationen der unabhängigen und der abhängigen Variablen beinhalten. Beispielsweise sind die Transformationen
log ⥠⥠( y i ) = β β 0 + β β 1 log ⥠⥠( x i ) + ξ ξ i {\displaystyle \log(y_{i})=\beta _{0}+\beta _{1}\log(x_{i})+\varepsilon _{i}\quad } und y i = β β 0 + β β 1 x i 1 + x i 2 2 + ξ ξ i {\displaystyle \quad y_{i}=\beta _{0}+\beta _{1}{\frac {x_{i1}+x_{i2}}{2}}+\varepsilon _{i}}
zulässig, da sie ebenfalls lineare Modelle darstellen. Bei transformierten Daten ist zu beachten, dass sie die Interpretation der Regressionsparameter ändert.
Vorliegen einer Zufallsstichprobe
Es liegt eine Zufallsstichprobe des Umfangs n {\displaystyle n} ( X 1 , Y 1 ) , ⌠⌠, ( X n , Y n ) {\displaystyle (X_{1},Y_{1}),\ldots ,(X_{n},Y_{n})} mit Realisierungen ( x 1 , y 1 ) , ⌠⌠, ( x n , y n ) {\displaystyle (x_{1},y_{1}),\ldots ,(x_{n},y_{n})} vor, die dem wahren Modell y i = β β 0 + β β 1 x i + ξ ξ i {\displaystyle y_{i}=\beta _{0}+\beta _{1}x_{i}+\varepsilon _{i}} folgt.cite-ref-jw-4-1[4]
Annahmen Ăźber die StĂśrgrĂśĂen
In Bezug auf die StĂśrgrĂśĂen werden folgende Annahmen getroffen:cite-ref-auer49-3-1[3]
Der Erwartungswert der StĂśrgrĂśĂen ist Null:
Wenn das Modell einen â von Null verschiedenen â Achsenabschnitt enthält, ist es vernĂźnftig, dass man zumindest fordert, dass der Mittelwert von Îľ Îľ i {\displaystyle \varepsilon _{i}} in der Grundgesamtheit Null ist und sich die Schwankungen der einzelnen StĂśrgrĂśĂen Ăźber die Gesamtheit der Beobachtungen ausgleichen. Mathematisch bedeutet das, dass der Erwartungswert der StĂśrgrĂśĂen Null ist E ⥠⥠( Îľ Îľ i ) = 0 , i = 1 , ⌠⌠, n {\displaystyle \operatorname {E} (\varepsilon _{i})=0\quad ,i=1,\ldots ,n} . Diese Annahme macht keine Aussage Ăźber den Zusammenhang zwischen x {\displaystyle x} und Îľ Îľ {\displaystyle \varepsilon } , sondern gibt lediglich eine Aussage Ăźber die Verteilung der unsystematischen Komponente in der Grundgesamtheit.cite-ref-6[6] Dies bedeutet, dass das betrachte Modell im Mittel dem wahren Zusammenhang entspricht. Wäre der Erwartungswert nicht Null, dann wĂźrde man im Mittel einen falschen Zusammenhang schätzen. Zur Verletzung dieser Annahme kann es kommen, wenn eine relevante Variable im Regressionsmodell nicht berĂźcksichtigt wurde (siehe Verzerrung durch ausgelassene Variablen).
Die StĂśrgrĂśĂen Îľ Îľ 1 , ⌠⌠, Îľ Îľ n {\displaystyle \varepsilon _{1},\dotsc ,\varepsilon _{n}} sind voneinander unabhängige Zufallsvariablen
Wären die StĂśrgrĂśĂen nicht unabhängig, dann kĂśnnte man einen systematischen Zusammenhang zwischen ihnen formulieren. Das wĂźrde der Zerlegung von Y {\displaystyle Y} in eine eindeutige systematische und zufällige Komponente widersprechen. Es wird in der Zeitreihenanalyse z. B. oft ein Zusammenhang der Form Îľ Îľ i = f ( Îľ Îľ i â â 1 , Îľ Îľ i â â 2 , ⌠⌠) {\displaystyle \varepsilon _{i}=f(\varepsilon _{i-1},\varepsilon _{i-2},\ldots )} betrachtet.
Oft wird auch nur die Unkorreliertheit der StĂśrgrĂśĂen gefordert: Cov ⥠⥠( Îľ Îľ i , Îľ Îľ j ) = E ⥠⥠[ ( Îľ Îľ i â â E ⥠⥠( Îľ Îľ i ) ) ( ( Îľ Îľ j â â E ⥠⥠( Îľ Îľ j ) ) ] = E ⥠⥠( Îľ Îľ i Îľ Îľ j ) = 0 â â i â â j , i = 1 , ⌠⌠, n , j = 1 , ⌠⌠, n {\displaystyle \operatorname {Cov} (\varepsilon _{i},\varepsilon _{j})=\operatorname {E} [(\varepsilon _{i}-\operatorname {E} (\varepsilon _{i}))((\varepsilon _{j}-\operatorname {E} (\varepsilon _{j}))]=\operatorname {E} (\varepsilon _{i}\varepsilon _{j})=0\quad \forall i\neq j,\;i=1,\ldots ,n,\;j=1,\ldots ,n} oder äquivalent Cov ⥠⥠( Y i , Y j ) = 0 {\displaystyle \operatorname {Cov} (Y_{i},Y_{j})=0} .
Unabhängige Zufallsvariablen sind immer auch unkorreliert. Man spricht in diesem Zusammenhang auch von Abwesenheit von Autokorrelation.
Eine konstante Varianz (Homoskedastizität) der StĂśrgrĂśĂen: â â i : Var ⥠⥠( Îľ Îľ i ) = Var ⥠⥠( Y i ) = Ď Ď 2 = k o n s t . {\displaystyle \forall i:\operatorname {Var} (\varepsilon _{i})=\operatorname {Var} (Y_{i})=\sigma ^{2}=\mathrm {konst.} }
Wäre die Varianz nicht konstant, lieĂe sich evtl. die Varianz systematisch modellieren, d. h., dies widerspräche Zerlegung von Y i {\displaystyle Y_{i}} in eine eindeutige systematische und zufällige Komponente. Zudem lässt sich zeigen, dass sich die Schätzeigenschaften der Regressionsparameter verbessern lassen, wenn die Varianz nicht konstant ist.
Alle oben genannten Annahmen Ăźber die StĂśrgrĂśĂen lassen sich so zusammenfassen:
Îľ Îľ i âź âź u . i . v . ( 0 , Ď Ď 2 ) , i = 1 , ⌠⌠, n {\displaystyle \varepsilon _{i}\;{\stackrel {\mathrm {u.i.v.} }{\sim }}\;(0,\sigma ^{2})\quad ,i=1,\ldots ,n} ,
d. h., alle StĂśrgrĂśĂen sind unabhängig und identisch verteilt mit Erwartungswert E ⥠⥠( Îľ Îľ i ) = 0 {\displaystyle \operatorname {E} (\varepsilon _{i})=0} und Var ⥠⥠( Îľ Îľ i ) = Ď Ď 2 {\displaystyle \operatorname {Var} (\varepsilon _{i})=\sigma ^{2}} .
Optionale Annahme: Die StĂśrgrĂśĂen sind normalverteilt, also Îľ Îľ i âź âź N ( 0 , Ď Ď 2 ) , i = 1 , ⌠⌠, n {\displaystyle \varepsilon _{i}\;\sim \;{\mathcal {N}}(0,\sigma ^{2})\quad ,i=1,\ldots ,n}
Diese Annahme wird nur benĂśtigt um z. B. Konfidenzintervalle zu berechnen bzw. um Tests fĂźr die Regressionsparameter durchzufĂźhren.
Wird die Normalverteilung der StĂśrgrĂśĂen angenommen, so folgt, dass auch Y i {\displaystyle Y_{i}} normalverteilt ist:
Y i ⟠⟠N ( E ⥠⥠( Y i ) , Var ⥠⥠( Y i ) ) {\displaystyle Y_{i}\;\sim \;{\mathcal {N}}\left(\operatorname {E} (Y_{i}),\operatorname {Var} (Y_{i})\right)}
Die Verteilung der Y i {\displaystyle Y_{i}} hängt also von der Verteilung der StĂśrgrĂśĂen ab. Der Erwartungswert der abhängigen Variablen lautet:
E ⥠⥠( Y i ) = E ⥠⥠( β β 0 + β β 1 x i + ξ ξ i ) = β β 0 + β β 1 x i {\displaystyle \operatorname {E} (Y_{i})=\operatorname {E} \left(\beta _{0}+\beta _{1}x_{i}+\varepsilon _{i}\right)=\beta _{0}+\beta _{1}x_{i}}
Da die einzige zufällige Komponente in Y i {\displaystyle Y_{i}} die StĂśrgrĂśĂe Îľ Îľ i {\displaystyle \varepsilon _{i}} ist, gilt fĂźr die Varianz der abhängigen Variablen, dass sie gleich der Varianz der StĂśrgrĂśĂen entspricht:
Var ⥠⥠( Y i ) = Var ⥠⥠( β β 0 + β β 1 x i + Îľ Îľ i ) = Var ⥠⥠( Îľ Îľ i ) = Ď Ď 2 {\displaystyle \operatorname {Var} (Y_{i})=\operatorname {Var} (\beta _{0}+\beta _{1}x_{i}+\varepsilon _{i})=\operatorname {Var} (\varepsilon _{i})=\sigma ^{2}} .
Die Varianz der StĂśrgrĂśĂen spiegelt somit die Variabilität der abhängigen Variablen um ihren Mittelwert wider. Damit ergibt sich fĂźr die Verteilung der abhängigen Variablen:
Y i âź âź N ( β β 0 + β β 1 x i , Ď Ď 2 ) {\displaystyle Y_{i}\;\sim \;{\mathcal {N}}\left(\beta _{0}+\beta _{1}x_{i},\sigma ^{2}\right)} .
Aufgrund der Annahme, dass die StĂśrgrĂśĂen im Mittel Null sein mĂźssen, muss der Erwartungswert von Y i {\displaystyle Y_{i}} der Regressionsfunktion der Grundgesamtheit
y i = β β 0 + β β 1 x i {\displaystyle y_{i}=\beta _{0}+\beta _{1}x_{i}}
entsprechen. D. h., mit der Annahme Ăźber die StĂśrgrĂśĂen schlussfolgert man, dass das Modell im Mittel korrekt sein muss. Wenn zusätzlich zu den anderen Annahmen auch die Annahme der Normalverteiltheit gefordert wird spricht man auch vom klassischen linearen Modell (siehe auch #Klassisches lineares Modell der Normalregression).
Im Rahmen der Regressionsdiagnostik sollen die Voraussetzungen des Regressionsmodells, soweit mĂśglich, geprĂźft werden. Dazu zählen die ĂberprĂźfung, ob die StĂśrgrĂśĂen keine Struktur (die dann nicht zufällig wäre) haben.
Schätzung der Regressionsparameter und der StĂśrgrĂśĂen
Die Schätzung der Regressionsparameter β β 0 {\displaystyle \beta _{0}} und β β 1 {\displaystyle \beta _{1}} und der StĂśrgrĂśĂen Îľ Îľ i {\displaystyle \varepsilon _{i}} geschieht in zwei Schritten:
1. Zunächst werden mit Hilfe der Kleinste-Quadrate-Schätzung die unbekannten Regressionsparameter β β 0 {\displaystyle \beta _{0}} und β β 1 {\displaystyle \beta _{1}} geschätzt. Dabei wird die Summe der quadrierten Abweichungen zwischen dem geschätzten Regressionswert y ^ ^ i = β β ^ ^ 0 + β β ^ ^ 1 x i {\displaystyle {\hat {y}}_{i}={\hat {\beta }}_{0}+{\hat {\beta }}_{1}x_{i}} und dem beobachteten Wert y i {\displaystyle y_{i}} minimiert.cite-ref-wooldridge-7-0[7] Dabei ergeben sich folgende Formeln: β β ^ ^ 1 = â â i = 1 n ( x i â â x ÂŻ ÂŻ ) ( y i â â y ÂŻ ÂŻ ) â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 = S P x y S Q x {\displaystyle {\hat {\beta }}_{1}={\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})(y_{i}-{\overline {y}})}{\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}={\frac {SP_{xy}}{SQ_{x}}}} β β ^ ^ 0 = y ÂŻ ÂŻ â â β β ^ ^ 1 x ÂŻ ÂŻ {\displaystyle {\hat {\beta }}_{0}={\overline {y}}-{\hat {\beta }}_{1}{\overline {x}}}
2. Sind β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} und β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} berechnet, so kann das Residuum geschätzt werden als Îľ Îľ ^ ^ i = y i â â y ^ ^ i = y i â â β β ^ ^ 0 â â β β ^ ^ 1 x i {\displaystyle {\hat {\varepsilon }}_{i}=y_{i}-{\hat {y}}_{i}=y_{i}-{\hat {\beta }}_{0}-{\hat {\beta }}_{1}x_{i}} .
Herleitung der Formeln fĂźr die Regressionsparameter
Um nun die Parameter der Gerade zu bestimmen, wird die Zielfunktion Q {\displaystyle Q} (Fehlerquadratsumme bzw. die Residuenquadratsumme) minimiertcite-ref-8[8]cite-ref-9[9]
( β β ^ ^ 0 , β β ^ ^ 1 ) = arg ⥠⥠min β β 0 , β β 1 â â R Q ( β β 0 , β β 1 ) = arg ⥠⥠min β β 0 , β β 1 â â R â â i = 1 n ( y i â â ( β β 0 + β β 1 x i ) ) 2 {\displaystyle \left({\hat {\beta }}_{0},{\hat {\beta }}_{1}\right)={\underset {\beta _{0},\beta _{1}\in \mathbb {R} }{\arg \min }}\,Q(\beta _{0},\beta _{1})={\underset {\beta _{0},\beta _{1}\in \mathbb {R} }{\arg \min }}\sum _{i=1}^{n}\left(y_{i}-(\beta _{0}+\beta _{1}x_{i})\right)^{2}} cite-ref-10[10]
Die Bedingungen erster Ordnung (notwendige Bedingungen) lauten:
â â Q ( β β 0 , β β 1 ) â â β β 0 | β β ^ ^ 0 = â â 2 â â i = 1 n ( y i â â β β ^ ^ 0 â â β β 1 x i ) = ! 0 {\displaystyle \left.{\frac {\partial \,Q(\beta _{0},\,\beta _{1})}{\partial \beta _{0}}}\right|_{{\hat {\beta }}_{0}}=-2\sum _{i=1}^{n}\left(y_{i}-{\hat {\beta }}_{0}-\beta _{1}x_{i}\right){\overset {\mathrm {!} }{=}}\;0\quad }
und
â â Q ( β β 0 , β β 1 ) â â β β 1 | β β ^ ^ 1 = â â 2 â â i = 1 n x i ( y i â â β β 0 â â β β ^ ^ 1 x i ) = ! 0 {\displaystyle \left.{\frac {\partial \,Q(\beta _{0},\,\beta _{1})}{\partial \beta _{1}}}\right|_{{\hat {\beta }}_{1}}=-2\sum _{i=1}^{n}x_{i}\left(y_{i}-\beta _{0}-{\hat {\beta }}_{1}x_{i}\right){\overset {\mathrm {!} }{=}}\;0} .
Durch Nullsetzen der partiellen Ableitungen nach β β 0 {\displaystyle \beta _{0}} und β β 1 {\displaystyle \beta _{1}} ergeben sich die gesuchten Parameterschätzer, bei denen die Residuenquadratsumme minimal wird:
β β ^ ^ 1 = â â i = 1 n ( x i â â x ÂŻ ÂŻ ) ( y i â â y ÂŻ ÂŻ ) â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 = S P x y S Q x {\displaystyle {\hat {\beta }}_{1}={\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})(y_{i}-{\overline {y}})}{\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}={\frac {SP_{xy}}{SQ_{x}}}\;} und β β ^ ^ 0 = y ÂŻ ÂŻ â â β β ^ ^ 1 x ÂŻ ÂŻ {\displaystyle \;{\hat {\beta }}_{0}={\overline {y}}-{\hat {\beta }}_{1}{\overline {x}}} ,
wobei S P x y {\displaystyle SP_{xy}} die Summe der Abweichungsprodukte zwischen x {\displaystyle x} und y {\displaystyle y} und S Q x {\displaystyle SQ_{x}} die Summe der Abweichungsquadrate von x {\displaystyle x} darstellt. Mithilfe des Verschiebungssatzes von Steiner lässt sich β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} auch wie folgt einfacher, in nichtzentrierter Form, darstellen
β β ^ ^ 1 = â â i = 1 n ( x i y i ) â â n x ÂŻ ÂŻ y ÂŻ ÂŻ ( â â i = 1 n x i 2 ) â â n x ÂŻ ÂŻ 2 {\displaystyle {\hat {\beta }}_{1}={\frac {\sum _{i=1}^{n}(x_{i}y_{i})-n{\overline {x}}{\overline {y}}}{\left(\sum _{i=1}^{n}x_{i}^{2}\right)-n{\overline {x}}^{2}}}} .
Weitere Darstellungen von β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} erhält man, indem man die Formel in Abhängigkeit vom Bravais-Pearson-Korrelationskoeffizienten r x y {\displaystyle r_{xy}} schreibt. Entweder als
β β ^ ^ 1 = â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 â â i = 1 n ( y i â â y ÂŻ ÂŻ ) 2 â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 r x y {\displaystyle {\hat {\beta }}_{1}={\frac {{\sqrt {\displaystyle \sum \nolimits _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}}}{\sqrt {\displaystyle \sum \nolimits _{i=1}^{n}\left(y_{i}-{\bar {y}}\right)^{2}}}}{\displaystyle \sum \nolimits _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}}}r_{xy}\;} oder β β ^ ^ 1 = r x y s y s x {\displaystyle \;{\hat {\beta }}_{1}=r_{xy}{\frac {s_{y}}{s_{x}}}} ,
wobei s x {\displaystyle s_{x}} und s y {\displaystyle s_{y}} die empirischen Standardabweichungen von x {\displaystyle x} und y {\displaystyle y} darstellen. Die letztere Darstellung impliziert, dass der Kleinste-Quadrate-Schätzer fĂźr den Anstieg proportional zum Bravais-Pearson-Korrelationskoeffizienten r x y {\displaystyle r_{xy}} ist, d. h. β β ^ ^ 1 â â r x y {\displaystyle {\hat {\beta }}_{1}\propto r_{xy}} .
Die jeweiligen Kleinste-Quadrate-Schätzwerte von β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} und β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} werden als b 0 {\displaystyle b_{0}} und b 1 {\displaystyle b_{1}} abgekßrzt.
Algebraische Eigenschaften der Kleinste-Quadrate-Schätzer
Aus den Formeln sind drei Eigenschaften ableitbar:
1.) Die Regressiongerade verläuft durch den Schwerpunkt bzw. durch das âGravitationszentrumâ der Daten ( x ÂŻ ÂŻ , y ÂŻ ÂŻ ) {\displaystyle ({\overline {x}},{\overline {y}})} , was direkt aus der obigen Definition von β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} folgt. Man sollte beachten, dass dies nur gilt, wenn ein Achsenabschnitt fĂźr die Regression verwendet wird, wie man leicht an dem Beispiel mit den zwei Datenpunkten ( x 1 , y 1 ) = ( 1 , 0 ) , ( x 2 , y 2 ) = ( 2 , 1 ) {\displaystyle (x_{1},y_{1})=(1,0),(x_{2},y_{2})=(2,1)} sieht.
2.) Die KQ-Regressionsgerade wird so bestimmt, dass die Residuenquadratsumme zu einem Minimum wird. Ăquivalent dazu bedeutet das, dass sich positive und negative Abweichungen von der Regressionsgeraden ausgleichen. Wenn das Modell der linearen Einfachregression einen â von Null verschiedenen â Achsenabschnitt enthält, dann muss also gelten, dass die Summe der Residuen Null ist (dies ist äquivalent zu der Eigenschaft, dass die gemittelten Residuen Null ergeben)cite-ref-11[11]
â â i = 1 n Îľ Îľ ^ ^ i = 0 {\displaystyle \sum _{i=1}^{n}{\hat {\varepsilon }}_{i}=0} bzw. Îľ Îľ ^ ^ ÂŻ ÂŻ = 1 n â â i = 1 n Îľ Îľ ^ ^ i = 0 {\displaystyle {\overline {\hat {\varepsilon }}}={\frac {1}{n}}\sum _{i=1}^{n}{\hat {\varepsilon }}_{i}=0} .
Oder, da sich die Residuen als Funktion der StĂśrgrĂśĂen darstellen lassen, Îľ Îľ ^ ^ ÂŻ ÂŻ = Îľ Îľ ÂŻ ÂŻ â â ( β β ^ ^ 0 â â β β 0 ) â â ( β β ^ ^ 1 â â β β 1 ) x ÂŻ ÂŻ = 0 {\displaystyle {\overline {\hat {\varepsilon }}}={\overline {\varepsilon }}-({\hat {\beta }}_{0}-\beta _{0})-({\hat {\beta }}_{1}-\beta _{1}){\overline {x}}=0} . Diese Darstellung wird fĂźr die Herleitung der erwartungstreuen Schätzung der Varianz der StĂśrgrĂśĂen benĂśtigt.
3.) Die Residuen und die unabhängigen Variablen sind (unabhängig davon, ob ein Achsenabschnitt mit einbezogen wurde oder nicht) unkorreliert, d. h.
â â i = 1 n x i Îľ Îľ ^ ^ i = 0 {\displaystyle \sum _{i=1}^{n}x_{i}{\hat {\varepsilon }}_{i}=0} , was direkt aus der zweiten Optimalitätsbedingung von oben folgt.
Die Residuen und die geschätzten Werten sind unkorreliert, d. h.
â â i = 1 n Îľ Îľ ^ ^ i y ^ ^ i = 0 {\displaystyle \sum _{i=1}^{n}{\hat {\varepsilon }}_{i}{\hat {y}}_{i}=0} .
Diese Unkorreliertheit der prognostizierten Werte mit den Residuen kann so interpretiert werden, dass in der Vorhersage bereits alle relevante Information der erklärenden Variablen bezßglich der abhängigen Variablen steckt.cite-ref-12[12]
Schätzfunktionen der Kleinste-Quadrate-Schätzer
Aus der Regressionsgleichung y i = β β 0 + β β 1 x i + ξ ξ i {\displaystyle y_{i}=\beta _{0}+\beta _{1}x_{i}+\varepsilon _{i}} lassen sich die Schätzfunktionen β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} fßr β β 1 {\displaystyle \beta _{1}} und β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} fßr β β 0 {\displaystyle \beta _{0}} ableiten.
β β ^ ^ 1 = â â i = 1 n ( x i â â x ÂŻ ÂŻ ) ( Y i â â Y ÂŻ ÂŻ ) â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 = â â i = 1 n w i Y i â â Y ÂŻ ÂŻ â â i = 1 n w i â â = 0 {\displaystyle {\hat {\beta }}_{1}={\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})(Y_{i}-{\overline {Y}})}{\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}=\sum \nolimits _{i=1}^{n}w_{i}Y_{i}-{\overline {Y}}\underbrace {\sum \nolimits _{i=1}^{n}w_{i}} _{=0}} mit der Gewichtsfunktion w i = w i ( x i ) = ( x i â â x ÂŻ ÂŻ ) â â j = 1 n ( x j â â x ÂŻ ÂŻ ) 2 {\displaystyle w_{i}=w_{i}(x_{i})={\frac {(x_{i}-{\overline {x}})}{\sum \nolimits _{j=1}^{n}(x_{j}-{\overline {x}})^{2}}}}
β β ^ ^ 0 = Y ÂŻ ÂŻ â â β β ^ ^ 1 x ÂŻ ÂŻ = â â i = 1 n ( 1 n â â x ÂŻ ÂŻ w i ) Y i {\displaystyle {\hat {\beta }}_{0}={\overline {Y}}-{\hat {\beta }}_{1}{\overline {x}}=\sum \nolimits _{i=1}^{n}({\tfrac {1}{n}}-{\overline {x}}w_{i})Y_{i}} .
Die Formeln zeigen auch, dass die Schätzfunktionen der Regressionsparameter linear von Y i {\displaystyle Y_{i}} abhängen. Unter der Annahme der Normalverteilung der Residuen Îľ Îľ i âź âź N ( 0 , Ď Ď 2 ) {\displaystyle \varepsilon _{i}\sim {\mathcal {N}}(0,\sigma ^{2})} (oder wenn fĂźr Y i {\displaystyle Y_{i}} der zentrale Grenzwertsatz erfĂźllt ist) folgt, dass auch die Schätzfunktionen der Regressionsparameter β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} und β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} zumindest approximativ normalverteilt sind:
β β ^ ^ 1 âź âź a N ( β β 1 , Ď Ď Î˛ β ^ ^ 1 2 ) {\displaystyle {\hat {\beta }}_{1}\;{\stackrel {a}{\sim }}\;{\mathcal {N}}(\beta _{1},\sigma _{{\hat {\beta }}_{1}}^{2})} und β β ^ ^ 0 âź âź a N ( β β 0 , Ď Ď Î˛ β ^ ^ 0 2 ) {\displaystyle {\hat {\beta }}_{0}\;{\stackrel {a}{\sim }}\;{\mathcal {N}}(\beta _{0},\sigma _{{\hat {\beta }}_{0}}^{2})} .
Statistische Eigenschaften der Kleinste-Quadrate-Schätzer
Erwartungstreue der Kleinste-Quadrate-Schätzer
Die Schätzfunktionen der Regressionsparameter β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} und β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} sind erwartungstreu fĂźr β β 1 {\displaystyle \beta _{1}} und β β 0 {\displaystyle \beta _{0}} , d. h., es gilt E ⥠⥠( β β ^ ^ 1 ) = β β 1 {\displaystyle \operatorname {E} ({\hat {\beta }}_{1})=\beta _{1}} und E ⥠⥠( β β ^ ^ 0 ) = β β 0 {\displaystyle \operatorname {E} ({\hat {\beta }}_{0})=\beta _{0}} . Der Kleinste-Quadrate-Schätzer liefert also âim Mittelâ die wahren Werte der Koeffizienten.
Mit der Linearität des Erwartungswerts und der Voraussetzung E ⥠⥠( ξ ξ i ) = 0 {\displaystyle \operatorname {E} (\varepsilon _{i})=0} folgt nämlich E ⥠⥠( Y i ) = β β 0 + β β 1 x i {\displaystyle \operatorname {E} (Y_{i})=\beta _{0}+\beta _{1}x_{i}} und E ⥠⥠( Y ¯ ¯ ) = β β 0 + β β 1 x ¯ ¯ {\displaystyle \operatorname {E} ({\overline {Y}})=\beta _{0}+\beta _{1}{\overline {x}}} . Als Erwartungswert von β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} ergibt sich daher:cite-ref-13[13]
E ⥠⥠( β β ^ ^ 1 ) = E ⥠⥠( â â i = 1 n ( x i â â x ÂŻ ÂŻ ) ( Y i â â Y ÂŻ ÂŻ ) â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 ) = â â i = 1 n ( x i â â x ÂŻ ÂŻ ) E ⥠⥠( Y i â â Y ÂŻ ÂŻ ) â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 = â â i = 1 n ( x i â â x ÂŻ ÂŻ ) ( β β 0 + β β 1 x i â â ( β β 0 + β β 1 x ÂŻ ÂŻ ) ) â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 = β β 1 {\displaystyle {\begin{aligned}\operatorname {E} ({\hat {\beta }}_{1})&=\operatorname {E} \left({\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})(Y_{i}-{\overline {Y}})}{\sum \nolimits _{i=1}^{n}\left(x_{i}-{\overline {x}}\right)^{2}}}\right)={\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})\operatorname {E} (Y_{i}-{\overline {Y}})}{\sum \nolimits _{i=1}^{n}\left(x_{i}-{\overline {x}}\right)^{2}}}\\&\\&={\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})(\beta _{0}+\beta _{1}x_{i}-(\beta _{0}+\beta _{1}{\overline {x}}))}{\sum \nolimits _{i=1}^{n}\left(x_{i}-{\overline {x}}\right)^{2}}}=\beta _{1}\end{aligned}}}
FĂźr den Erwartungswert von β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} erhält man schlieĂlich:cite-ref-wooldridge-7-1[7]
E ⥠⥠( β β ^ ^ 0 ) = E ⥠⥠( Y ÂŻ ÂŻ â â β β ^ ^ 1 x ÂŻ ÂŻ ) = E ⥠⥠( Y ÂŻ ÂŻ ) â â E ⥠⥠( β β ^ ^ 1 ) x ÂŻ ÂŻ = β β 0 + β β 1 x ÂŻ ÂŻ â â = E ⥠⥠( Y ÂŻ ÂŻ ) â â β β 1 x ÂŻ ÂŻ = β β 0 {\displaystyle \operatorname {E} ({\hat {\beta }}_{0})=\operatorname {E} ({\overline {Y}}-{\hat {\beta }}_{1}{\overline {x}})=\operatorname {E} ({\overline {Y}})-\operatorname {E} ({\hat {\beta }}_{1}){\overline {x}}=\underbrace {\beta _{0}+\beta _{1}{\overline {x}}} _{=\operatorname {E} ({\overline {Y}})}-\beta _{1}{\overline {x}}=\beta _{0}} .
Varianzen der Kleinste-Quadrate-Schätzer
Die Varianzen des Achsenabschnittes β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} und des Steigungsparameters β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} sind gegeben durch:cite-ref-14[14]
Ď Ď Î˛ β ^ ^ 0 2 = Var ⥠⥠( β β ^ ^ 0 ) = Ď Ď 2 n ( 1 + x ÂŻ ÂŻ 2 s x 2 ) = Ď Ď 2 â â i = 1 n x i 2 n â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 â â =: a 0 = Ď Ď 2 â
â
a 0 {\displaystyle \sigma _{{\hat {\beta }}_{0}}^{2}=\operatorname {Var} ({\hat {\beta }}_{0})={\frac {\sigma ^{2}}{n}}\left(1+{\frac {{\overline {x}}^{2}}{s_{x}^{2}}}\right)=\sigma ^{2}\underbrace {\frac {\sum \nolimits _{i=1}^{n}x_{i}^{2}}{n\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}} _{=:a_{0}}=\sigma ^{2}\cdot a_{0}} und
Ď Ď Î˛ β ^ ^ 1 2 = Var ⥠⥠( β β ^ ^ 1 ) = Var ⥠⥠( â â i = 1 n ( x i â â x ÂŻ ÂŻ ) ( Y i â â Y ÂŻ ÂŻ ) â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 ) = Var ⥠⥠( â â i = 1 n ( x i â â x ÂŻ ÂŻ ) Y i â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 ) = â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 Var ⥠⥠( Y i ) [ â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 ] 2 = Ď Ď 2 1 â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 â â =: a 1 = Ď Ď 2 â
â
a 1 {\displaystyle {\begin{aligned}\;\sigma _{{\hat {\beta }}_{1}}^{2}=\operatorname {Var} ({\hat {\beta }}_{1})&=\operatorname {Var} \left({\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})(Y_{i}-{\overline {Y}})}{\sum \nolimits _{i=1}^{n}\left(x_{i}-{\overline {x}}\right)^{2}}}\right)=\operatorname {Var} \left({\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})Y_{i}}{\sum \nolimits _{i=1}^{n}\left(x_{i}-{\overline {x}}\right)^{2}}}\right)\\&\\&={\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}\operatorname {Var} (Y_{i})}{\left[\sum \nolimits _{i=1}^{n}\left(x_{i}-{\overline {x}}\right)^{2}\right]^{2}}}=\sigma ^{2}\underbrace {\frac {1}{\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}} _{=:a_{1}}=\sigma ^{2}\cdot a_{1}\end{aligned}}} .
Dabei stellt s x 2 {\displaystyle s_{x}^{2}} die empirische Varianz dar. Je grĂśĂer die Streuung in der erklärenden Variablen (d. h. je grĂśĂer â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 {\displaystyle \sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}} ), desto grĂśĂer ist die Präzision von β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} und β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} . Da die Anzahl der Terme in dem Ausdruck â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 {\displaystyle \sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}} umso grĂśĂer ist, je grĂśĂer die StichprobengrĂśĂe ist, fĂźhren grĂśĂere Stichproben immer zu einer grĂśĂeren Präzision. AuĂerdem kann man sehen: Je kleiner die Varianz der StĂśrgrĂśĂen Ď Ď 2 {\displaystyle \sigma ^{2}} ist, desto präziser sind die Schätzer.cite-ref-15[15]
Die Kovarianz von β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} und β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} ist gegeben durch
Cov ⥠⥠( β β ^ ^ 0 , β β ^ ^ 1 ) = Ď Ď 2 â â x ÂŻ ÂŻ â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 {\displaystyle \operatorname {Cov} ({\hat {\beta }}_{0},{\hat {\beta }}_{1})=\sigma ^{2}{\frac {-{\overline {x}}}{\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}} .
Falls fĂźr n â â â â {\displaystyle n\to \infty } die Konsistenzbedingung
â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 â â â â {\displaystyle \sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}\to \infty }
gilt, sind die Kleinste-Quadrate-Schätzer β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} und β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} konsistent fĂźr β β 0 {\displaystyle \beta _{0}} und β β 1 {\displaystyle \beta _{1}} . Dies bedeutet, dass mit zunehmender StichprobengrĂśĂe der wahre Wert immer genauer geschätzt wird und die Varianz letztendlich verschwindet. Die Konsistenzbedingung besagt, dass die Werte x 1 , ⌠⌠, x n {\displaystyle x_{1},\ldots ,x_{n}} hinreichend stark um ihr arithmetisches Mittel variieren. Nur auf diese Art und Weise kommt zusätzliche Information zur Schätzung von β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} und β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} hinzu.cite-ref-16[16] Das Problem an den beiden Varianzformeln ist jedoch, dass die wahre Varianz der StĂśrgrĂśĂen Ď Ď 2 {\displaystyle \sigma ^{2}} unbekannt ist und somit geschätzt werden muss. Die positiven Quadratwurzeln der geschätzten Varianzen werden als (geschätzte) Standardfehler der Regressionskoeffizienten β β ^ ^ 0 {\displaystyle {\hat {\beta }}_{0}} und β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} bezeichnet und sind wichtig fĂźr die Beurteilung der AnpassungsgĂźte (siehe auch Standardfehler der Regressionsparameter im einfachen Regressionsmodell).
Schätzer fĂźr die Varianz der StĂśrgrĂśĂen
Eine erwartungstreue Schätzung der Varianz der StĂśrgrĂśĂen ist gegeben durchcite-ref-17[17]
Ď Ď ^ ^ 2 = 1 n â â 2 â â i = 1 n ( y i â â β β ^ ^ 0 â â β β ^ ^ 1 x i ) 2 {\displaystyle {\hat {\sigma }}^{2}={\frac {1}{n-2}}\sum \limits _{i=1}^{n}(y_{i}-{\hat {\beta }}_{0}-{\hat {\beta }}_{1}x_{i})^{2}} ,
d. h., es gilt E ⥠⥠( Ď Ď ^ ^ 2 ) = Ď Ď 2 {\displaystyle \operatorname {E} ({\hat {\sigma }}^{2})=\sigma ^{2}} (fĂźr einen Beweis siehe Erwartungstreuer Schätzer fĂźr die Varianz der StĂśrgrĂśĂen). Die positive Quadratwurzel dieser erwartungstreuen Schätzfunktion wird auch als Standardfehler der Regression bezeichnet.cite-ref-18[18] Der Schätzwert von Ď Ď ^ ^ 2 {\displaystyle {\hat {\sigma }}^{2}} wird auch mittleres Residuenquadrat M Q R {\displaystyle MQR} genannt. Das mittlere Residuenquadrat wird benĂśtigt, um Konfidenzintervalle fĂźr β β 0 {\displaystyle \beta _{0}} und β β 1 {\displaystyle \beta _{1}} zu bestimmen.cite-ref-19[19]
Das Ersetzen von Ď Ď 2 {\displaystyle \sigma ^{2}} durch Ď Ď ^ ^ 2 {\displaystyle {\hat {\sigma }}^{2}} in den obigen Formeln fĂźr die Varianzen der Regressionsparameter liefert die Schätzungen Var ⥠⥠( β β ^ ^ 0 ) ^ ^ {\displaystyle {\widehat {\operatorname {Var} ({\hat {\beta }}_{0})}}\;} und Var ⥠⥠( β β ^ ^ 1 ) ^ ^ {\displaystyle \;{\widehat {\operatorname {Var} ({\hat {\beta }}_{1})}}} fĂźr die Varianzen.
Bester lineare erwartungstreue Schätzer
â
Hauptartikel
:
Satz von GauĂ-Markow
Es lässt sich zeigen, dass der Kleinste-Quadrate-Schätzer die beste lineare erwartungstreue Schätzfunktion darstellt. Eine erwartungstreue Schätzfunktion ist âbesserâ als eine andere, wenn sie eine kleinere Varianz aufweist, da die Varianz ein MaĂ fĂźr die Unsicherheit ist. Somit ist die beste Schätzfunktion dadurch gekennzeichnet, dass sie eine minimale Varianz und somit die geringste Unsicherheit aufweist. Diejenige Schätzfunktion, die unter den linearen erwartungstreuen Schätzfunktionen die kleinste Varianz aufweist, wird auch als bester linearer erwartungstreuer Schätzer, kurz BLES (englisch Best Linear Unbiased Estimator, kurz: BLUE) bezeichnet. FĂźr alle anderen linearen erwartungstreuen Schätzer β β ~ ~ 0 {\displaystyle {\tilde {\beta }}_{0}} und β β ~ ~ 1 {\displaystyle {\tilde {\beta }}_{1}} gilt somit
Var ⥠⥠( β β ^ ^ 0 ) ⤠⤠Var ⥠⥠( β β ~ ~ 0 ) {\displaystyle \operatorname {Var} ({\hat {\beta }}_{0})\leq \operatorname {Var} ({\tilde {\beta }}_{0})\quad } und Var ⥠⥠( β β ^ ^ 1 ) ⤠⤠Var ⥠⥠( β β ~ ~ 1 ) {\displaystyle \quad \operatorname {Var} ({\hat {\beta }}_{1})\leq \operatorname {Var} ({\tilde {\beta }}_{1})} .
Auch ohne Normalverteilungsannahme ist der Kleinste-Quadrate-Schätzer ein bester linearer erwartungstreuer Schätzer.
Klassisches lineares Modell der Normalregression
Wenn man zusätzlich zu den klassischen Annahmen annimmt, dass die StĂśrgrĂśĂen normalverteilt sind ( Îľ Îľ i âź âź N ( 0 , Ď Ď 2 ) , i = 1 , ⌠⌠, n {\displaystyle \varepsilon _{i}\;\sim \;{\mathcal {N}}(0,\sigma ^{2})\quad ,i=1,\ldots ,n} ), dann ist es mĂśglich statistische Inferenz (Schätzen und Testen) durchzufĂźhren. Ein Modell, das zusätzlich die Normalverteilungsannahme erfĂźllt, wird Klassisches lineares Modell der Normalregression genannt. Bei solch einem Modell kĂśnnen dann Konfidenzintervalle und Tests fĂźr die Regressionsparameter konstruiert werden. Insbesondere wird bei t-Tests diese Normalverteilungsannahme benĂśtigt, da eine t-Verteilung als PrĂźfgrĂśĂenverteilung herangezogen wird, die man erhält wenn man eine standardnormalverteilte Zufallsvariable durch die Quadratwurzel einer (um die Anzahl ihrer Freiheitsgrade korrigierten) Chi-Quadrat-verteilten Zufallsvariablen dividiert.
t -Tests
Die Normalverteilungsannahme Îľ Îľ i âź âź N ( 0 , Ď Ď 2 ) , i = 1 , ⌠⌠, n {\displaystyle \varepsilon _{i}\;\sim \;{\mathcal {N}}(0,\sigma ^{2})\quad ,i=1,\ldots ,n} impliziert β β ^ ^ 1 âź âź N ( β β 1 , Ď Ď Î˛ β ^ ^ 1 2 ) {\displaystyle {\hat {\beta }}_{1}\;{\sim }\;{\mathcal {N}}(\beta _{1},\sigma _{{\hat {\beta }}_{1}}^{2})} und β β ^ ^ 0 âź âź N ( β β 0 , Ď Ď Î˛ β ^ ^ 0 2 ) {\displaystyle {\hat {\beta }}_{0}\;{\sim }\;{\mathcal {N}}(\beta _{0},\sigma _{{\hat {\beta }}_{0}}^{2})} und damit ergibt sich fĂźr Achsenabschnitt und Steigung die folgende t-Statistik:
T = β β ^ ^ j â â β β j 0 Ď Ď ^ ^ β β ^ ^ j âź âź H 0 t ( n â â 2 ) , j = 0 , 1 {\displaystyle T={\frac {{\hat {\beta }}_{j}-\beta _{j}^{0}}{{\hat {\sigma }}_{{\hat {\beta }}_{j}}}}\;{\stackrel {H_{0}}{\sim }}\;{\mathcal {t}}_{(n-2)},\quad j=0,1} .
Zum Beispiel kann ein Signifikanztest durchgefĂźhrt werden, bei dem Nullhypothese und Alternativhypothese wie folgt spezifiziert sind: H 0 : : β β j = 0 {\displaystyle H_{0}\colon \beta _{j}=0} gegen H 1 : β β j â â 0 {\displaystyle H_{1}:\beta _{j}\neq 0} . FĂźr die PrĂźfgrĂśĂe gilt dann:
T = β β ^ ^ j â â 0 Ď Ď ^ ^ β β ^ ^ j = β β ^ ^ j Ď Ď ^ ^ β β ^ ^ j âź âź H 0 t ( n â â 2 ) , j = 0 , 1 {\displaystyle T={\frac {{\hat {\beta }}_{j}-0}{{\hat {\sigma }}_{{\hat {\beta }}_{j}}}}={\frac {{\hat {\beta }}_{j}}{{\hat {\sigma }}_{{\hat {\beta }}_{j}}}}\;{\stackrel {H_{0}}{\sim }}\;{\mathcal {t}}_{(n-2)},\quad j=0,1} ,
wobei t ( n â â 2 ) {\displaystyle {\mathcal {t}}_{(n-2)}} das 1 â â Îą Îą / 2 {\displaystyle 1-\alpha /2} der t-Verteilung mit ( n â â 2 ) {\displaystyle (n-2)} Freiheitsgraden ist.
Konfidenzintervalle
Um Konfidenzintervalle fĂźr den Fall der linearen Einfachregression herzuleiten, benĂśtigt man die Normalverteilungsannahme fĂźr die StĂśrgrĂśĂen. Als ( 1 â â Îą Îą ) {\displaystyle (1-\alpha )} -Konfidenzintervalle fĂźr die unbekannten Parameter β β 0 {\displaystyle \beta _{0}} und β β 1 {\displaystyle \beta _{1}} erhält man:
K I 1 â â Îą Îą ( β β 0 ) = [ β β ^ ^ 0 â â Ď Ď ^ ^ β β ^ ^ 0 t 1 â â Îą Îą / 2 ( n â â 2 ) ; β β ^ ^ 0 + Ď Ď ^ ^ β β ^ ^ 0 t 1 â â Îą Îą / 2 ( n â â 2 ) ] {\displaystyle KI_{1-\alpha }(\beta _{0})=\left[{\hat {\beta }}_{0}-{\hat {\sigma }}_{{\hat {\beta }}_{0}}t_{1-\alpha /2}(n-2);{\hat {\beta }}_{0}+{\hat {\sigma }}_{{\hat {\beta }}_{0}}t_{1-\alpha /2}(n-2)\right]\;} und K I 1 â â Îą Îą ( β β 1 ) = [ β β ^ ^ 1 â â Ď Ď ^ ^ β β ^ ^ 1 t 1 â â Îą Îą / 2 ( n â â 2 ) ; β β ^ ^ 1 + Ď Ď ^ ^ β β ^ ^ 1 t 1 â â Îą Îą / 2 ( n â â 2 ) ] {\displaystyle \;KI_{1-\alpha }(\beta _{1})=\left[{\hat {\beta }}_{1}-{\hat {\sigma }}_{{\hat {\beta }}_{1}}t_{1-\alpha /2}(n-2);{\hat {\beta }}_{1}+{\hat {\sigma }}_{{\hat {\beta }}_{1}}t_{1-\alpha /2}(n-2)\right]} ,
wobei t 1 â â Îą Îą / 2 ( n â â 2 ) {\displaystyle t_{1-\alpha /2}(n-2)} das ( 1 â â Îą Îą / 2 ) {\displaystyle (1-\alpha /2)} -Quantil der studentschen t-Verteilung mit ( n â â 2 ) {\displaystyle (n-2)} Freiheitsgraden ist und die geschätzten Standardfehler Ď Ď ^ ^ β β ^ ^ 0 {\displaystyle {\hat {\sigma }}_{{\hat {\beta }}_{0}}} und Ď Ď ^ ^ β β ^ ^ 1 {\displaystyle {\hat {\sigma }}_{{\hat {\beta }}_{1}}} der unbekannten Parameter β β 0 {\displaystyle \beta _{0}} und β β 1 {\displaystyle \beta _{1}} gegeben sind durch die Quadratwurzeln der geschätzten Varianzen der Kleinste-Quadrate-Schätzer:
Ď Ď ^ ^ β β ^ ^ 0 = SE ⥠⥠( β β ^ ^ 0 ) = M Q R â â i = 1 n x i 2 n â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 {\displaystyle {\hat {\sigma }}_{{\hat {\beta }}_{0}}=\operatorname {SE} ({\hat {\beta }}_{0})={\sqrt {\frac {MQR\sum \nolimits _{i=1}^{n}x_{i}^{2}}{n\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}}\;} und Ď Ď ^ ^ β β ^ ^ 1 = SE ⥠⥠( β β ^ ^ 1 ) = M Q R â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 {\displaystyle \;{\hat {\sigma }}_{{\hat {\beta }}_{1}}=\operatorname {SE} ({\hat {\beta }}_{1})={\sqrt {\frac {MQR}{\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}}} ,
wobei M Q R {\displaystyle MQR} das mittlere Residuenquadrat darstellt.
Vorhersage
â
Hauptartikel
:
Vorhersagemodell
Oft ist man daran interessiert fßr einen neuen Wert x 0 {\displaystyle x_{0}} die (Realisierung) der abhängigen Variablen y 0 {\displaystyle y_{0}} zu schätzen. Beispielsweise kÜnnte x 0 {\displaystyle x_{0}} der geplante Preis eines Produktes sein und y 0 {\displaystyle y_{0}} der Absatz sein. In diesem Fall nimmt man das gleiche einfache Regressionsmodell wie oben dargestellt an. Fßr eine neue Beobachtung y 0 {\displaystyle y_{0}} mit dem Wert der unabhängigen Variablen x 0 {\displaystyle x_{0}} ist die Vorhersage basierend auf der einfachen linearen Regression gegeben durch
y ^ ^ 0 = β β ^ ^ 0 + β β ^ ^ 1 x 0 {\displaystyle {\hat {y}}_{0}={\hat {\beta }}_{0}+{\hat {\beta }}_{1}x_{0}}
Da man den Wert der abhängigen Variablen nie genau vorhersehen kann, ergibt sich immer ein Schätzfehler. Dieser Fehler wird als Vorhersagefehler bezeichnet und ergibt sich aus
y ^ ^ 0 â â y 0 {\displaystyle {\hat {y}}_{0}-y_{0}}
Im Fall der einfachen linearen Regression ergibt sich fĂźr den Erwartungswert und die Varianz des Vorhersagefehlers:
E ⥠⥠( y ^ ^ 0 â â y 0 ) = 0 {\displaystyle \operatorname {E} ({\hat {y}}_{0}-y_{0})=0\;} und Ď Ď 0 2 = Var ⥠⥠( y ^ ^ 0 â â y 0 ) = Ď Ď 2 ( 1 + 1 n + ( x 0 â â x ÂŻ ÂŻ ) 2 â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 ) {\displaystyle \;\sigma _{0}^{2}=\operatorname {Var} ({\hat {y}}_{0}-y_{0})=\sigma ^{2}\left(1+{\frac {1}{n}}+{\frac {(x_{0}-{\overline {x}})^{2}}{\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}\right)} .
Bei Punktvorhersagen dient die Angabe eines Vorhersageintervalls dazu, die Vorhersagepräzision und -sicherheit auszudrĂźcken. Mit Wahrscheinlichkeit ( 1 â â Îą Îą ) {\displaystyle (1-\alpha )} wird die Variable an der Stelle x 0 {\displaystyle x_{0}} einen Wert annehmen, der in folgendem ( 1 â â Îą Îą ) {\displaystyle (1-\alpha )} -Vorhersageintervall liegtcite-ref-20[20]cite-ref-21[21]
y ^ ^ 0 Âą Âą t ( 1 â â Îą Îą / 2 ) ( n â â 2 ) â
â
Ď Ď ^ ^ 2 ( 1 + 1 n + ( x 0 â â x ÂŻ ÂŻ ) 2 â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 ) {\displaystyle {\hat {y}}_{0}\pm t_{(1-\alpha /2)}(n-2)\cdot {\sqrt {{\hat {\sigma }}^{2}\left(1+{\frac {1}{n}}+{\frac {(x_{0}-{\overline {x}})^{2}}{\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}\right)}}} .
Aus dieser Form des Konfidenzintervalls erkennt man sofort, dass das Konfidenzintervall breiter wird, wenn sich die unabhängige Vorhersagevariable x 0 {\displaystyle x_{0}} vom âGravitationszentrumâ der Daten entfernt. Schätzungen der abhängigen Variablen sollten also im Beobachtungsraum der Daten liegen, sonst werden sie sehr unzuverlässig.
Kausalität und Regressionsrichtung
â
Hauptartikel
:
Kausalität
Wie in der statistischen Literatur immer wieder betont wird, ist ein hoher Wert des Korrelationskoeffizienten zweier Variablen X {\displaystyle X} und Y {\displaystyle Y} allein noch kein hinreichender Beleg fßr den kausalen (d. h. ursächlichen) Zusammenhang von X {\displaystyle X} und Y {\displaystyle Y} , ebenso wenig fßr dessen mÜgliche Richtung. Es ist hier nämlich ein Fehlschluss der Art cum hoc ergo propter hoc mÜglich.
Anders als gemeinhin beschrieben, sollte man es daher bei der linearen Regression zweier Variablen X {\displaystyle X} und Y {\displaystyle Y} stets mit nicht nur einer, sondern zwei voneinander unabhängigen Regressionsgeraden zu tun haben: der ersten fßr die vermutete lineare Abhängigkeit y = g x ( x ) {\displaystyle y=g_{x}(x)} (Regression von Y {\displaystyle Y} auf X {\displaystyle X} ), der zweiten fßr die nicht minder mÜgliche Abhängigkeit x = g y ( y ) {\displaystyle x=g_{y}(y)} (Regression von X {\displaystyle X} auf Y {\displaystyle Y} ).cite-ref-22[22]
Bezeichnet man die Richtung der x {\displaystyle x} -Achse als Horizontale und die der y {\displaystyle y} -Achse als Vertikale, läuft die Berechnung des Regressionsparameter also im ersten Fall auf das ßblicherweise bestimmte Minimum der vertikalen quadratischen Abweichungen hinaus, im zweiten Fall dagegen auf das Minimum der horizontalen quadratischen Abweichungen.
Rein äuĂerlich betrachtet bilden die beiden Regressionsgeraden y = g x ( x ) {\displaystyle y=g_{x}(x)} und x = g y ( y ) {\displaystyle x=g_{y}(y)} eine Schere, deren Schnitt- und Angelpunkt der Schwerpunkt der Daten P ( x ÂŻ ÂŻ | y ÂŻ ÂŻ ) {\displaystyle P({\overline {x}}|{\overline {y}})} ist. Je weiter sich diese Schere Ăśffnet, desto geringer ist die Korrelation beider Variablen, bis hin zur Orthogonalität beider Regressionsgeraden, zahlenmäĂig ausgedrĂźckt durch den Korrelationskoeffizienten 0 {\displaystyle 0} bzw. Schnittwinkel 90 â â {\displaystyle 90^{\circ }} .
Umgekehrt nimmt die Korrelation beider Variablen umso mehr zu, je mehr sich die Schere schlieĂt â bei Kollinearität der Richtungsvektoren beider Regressionsgeraden schlieĂlich, also dann, wenn beide bildlich Ăźbereinander liegen, nimmt r x y {\displaystyle r_{xy}} je nach Vorzeichen der Kovarianz den Maximalwert + 1 {\displaystyle +1} oder â â 1 {\displaystyle -1} an, was bedeutet, dass zwischen X {\displaystyle X} und Y {\displaystyle Y} ein streng linearer Zusammenhang besteht und sich (wohlgemerkt nur in diesem einen einzigen Fall) die Berechnung einer zweiten Regressionsgeraden erĂźbrigt.
Wie der nachfolgenden Tabelle zu entnehmen, haben die Gleichungen der beiden Regressionsgeraden groĂe formale Ăhnlichkeit, etwa, was ihre Anstiege β β ^ ^ 2 x {\displaystyle {{\hat {\beta }}_{2}}_{x}} bzw. β β ^ ^ 2 y {\displaystyle {{\hat {\beta }}_{2}}_{y}} angeht, die gleich den jeweiligen Regressionsparameter sind und sich nur durch ihre Nenner unterscheiden: im ersten Fall die Varianz von X {\displaystyle X} , im zweiten die von Y {\displaystyle Y} :
| Regression von Y {\displaystyle Y} auf X {\displaystyle X} | ZusammenhangsmaĂe | Regression von X {\displaystyle X} auf Y {\displaystyle Y} |
|---|---|---|
| Regressionskoeffizient x {\displaystyle _{x}} | Produkt-Moment-Korrelation | Regressionskoeffizient y {\displaystyle _{y}} |
| β 1 x = Cov ⥠( X , Y ) Var ⥠( X ) {\displaystyle {\beta _{1}}_{x}={\frac {\operatorname {Cov} (X,Y)}{\operatorname {Var} (X)}}} | Ď X , Y = Cov ⥠( X , Y ) Var ⥠( X ) â
Var ⥠( Y ) {\displaystyle \rho _{X,Y}={\frac {\operatorname {Cov} (X,Y)}{\sqrt {\operatorname {Var} (X)\cdot \operatorname {Var} (Y)}}}} | β 1 y = Cov ⥠( X , Y ) Var ⥠( Y ) {\displaystyle {\beta _{1}}_{y}={\frac {\operatorname {Cov} (X,Y)}{\operatorname {Var} (Y)}}} |
| Empirischer Regressionskoeffizient x {\displaystyle _{x}} | Empirischer Korrelationskoeffizient | Empirischer Regressionskoeffizient y {\displaystyle _{y}} |
| β ^ 1 x = â i = 1 n ( x i â x ÂŻ ) ( y i â y ÂŻ ) â i = 1 n ( x i â x ÂŻ ) 2 β ^ 0 x = y ÂŻ â β 1 ^ x x ÂŻ {\displaystyle {\begin{aligned}{{\hat {\beta }}_{1}}_{x}&={\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})(y_{i}-{\overline {y}})}{\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}\\{{\hat {\beta }}_{0}}_{x}&={\overline {y}}-{\hat {\beta _{1}}}_{x}{\overline {x}}\end{aligned}}} | r x y = â i = 1 n ( x i â x ÂŻ ) ( y i â y ÂŻ ) â i = 1 n ( x i â x ÂŻ ) 2 â
â i = 1 n ( y i â y ÂŻ ) 2 {\displaystyle {\begin{aligned}r_{xy}&={\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})(y_{i}-{\overline {y}})}{\sqrt {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}\cdot \sum \nolimits _{i=1}^{n}(y_{i}-{\overline {y}})^{2}}}}\end{aligned}}} | β ^ 1 y = â i = 1 n ( x i â x ÂŻ ) ( y i â y ÂŻ ) â i = 1 n ( y i â y ÂŻ ) 2 β ^ 0 y = x ÂŻ â β 1 ^ y y ÂŻ {\displaystyle {\begin{aligned}{{\hat {\beta }}_{1}}_{y}&={\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})(y_{i}-{\overline {y}})}{\sum \nolimits _{i=1}^{n}(y_{i}-{\overline {y}})^{2}}}\\{{\hat {\beta }}_{0}}_{y}&={\overline {x}}-{\hat {\beta _{1}}}_{y}{\overline {y}}\end{aligned}}} |
| Regressionsgerade x {\displaystyle _{x}} | BestimmtheitsmaĂ | Regressionsgerade y {\displaystyle _{y}} |
| y ^ = β ^ 0 x + β ^ 1 x â
x = y ÂŻ + β ^ 1 x â
( x â x ÂŻ ) {\displaystyle {\begin{aligned}{\hat {y}}&={{\hat {\beta }}_{0}}_{x}+{{\hat {\beta }}_{1}}_{x}\cdot x\\&={\overline {y}}+{{\hat {\beta }}_{1}}_{x}\cdot (x-{\overline {x}})\end{aligned}}} | R 2 = r x y 2 = β ^ 1 x β ^ 1 y {\displaystyle R^{2}=r_{xy}^{2}={{\hat {\beta }}_{1}}_{x}{{\hat {\beta }}_{1}}_{y}} | x ^ = β ^ 0 y + β ^ 1 y â
y = x ÂŻ + β ^ 1 y â
( y â y ÂŻ ) {\displaystyle {\begin{aligned}{\hat {x}}&={{\hat {\beta }}_{0}}_{y}+{{\hat {\beta }}_{1}}_{y}\cdot y\\&={\overline {x}}+{{\hat {\beta }}_{1}}_{y}\cdot (y-{\overline {y}})\end{aligned}}} |
Zu erkennen ist auĂerdem die mathematische Mittelstellung des Korrelationskoeffizienten und seines Quadrats, des BestimmtheitsmaĂes, gegenĂźber den beiden Regressionsparameter, dadurch entstehend, dass man anstelle der Varianzen von X {\displaystyle X} bzw. Y {\displaystyle Y} deren geometrisches Mittel
x ÂŻ ÂŻ g e o m = Var ⥠⥠( X ) â
â
Var ⥠⥠( Y ) {\displaystyle {\overline {x}}_{\mathrm {geom} }={\sqrt {\operatorname {Var} (X)\cdot \operatorname {Var} (Y)}}}
in den Nenner setzt. Betrachtet man die Differenzen ( x i â â x ÂŻ ÂŻ ) {\displaystyle (x_{i}-{\overline {x}})} als Komponenten eines n {\displaystyle n} -dimensionalen Vektors x {\displaystyle \mathbf {x} } und die Differenzen ( y i â â y ÂŻ ÂŻ ) {\displaystyle (y_{i}-{\overline {y}})} als Komponenten eines n {\displaystyle n} -dimensionalen Vektors y {\displaystyle \mathbf {y} } , lässt sich der empirische Korrelationskoeffizient schlieĂlich auch als Kosinus des von beiden Vektoren eingeschlossenen Winkels θ θ {\displaystyle \theta } interpretieren:
r x y := â â i = 1 n ( x i â â x ÂŻ ÂŻ ) â
â
( y i â â y ÂŻ ÂŻ ) â â i = 1 n ( x i â â x ÂŻ ÂŻ ) 2 â
â
â â i = 1 n ( y i â â y ÂŻ ÂŻ ) 2 = x â â y | x | â
â
| y | = cos ⥠⥠θ θ {\displaystyle r_{xy}:={\frac {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})\cdot (y_{i}-{\overline {y}})}{{\sqrt {\sum \nolimits _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}\cdot {\sqrt {\sum \nolimits _{i=1}^{n}(y_{i}-{\overline {y}})^{2}}}}}={\frac {\mathbf {x} \circ \mathbf {y} }{|\mathbf {x} |\cdot |\mathbf {y} |}}=\cos \theta }
Lineare Einfachregression durch den Ursprung
Im Fall der einfachen linearen Regression durch den Ursprung bzw. Regression ohne Achsenabschnitt (der Achsenabschnitt β β 0 {\displaystyle \beta _{0}} wird nicht in die Regression miteinbezogen, und daher verläuft die Regressionsgerade durch den Koordinatenursprung) lautet die konkrete empirische Regressionsgleichung y ~ ~ = β β ~ ~ 1 x {\displaystyle {\tilde {y}}={\tilde {\beta }}_{1}x} , wobei die Notation y ~ ~ , β β ~ ~ 1 {\displaystyle {\tilde {y}},{\tilde {\beta }}_{1}} benutzt wird um von der allgemeinen Problemstellung der Schätzung eines Steigungsparameters mit Hinzunahme eines Achsenabschnitts zu unterscheiden. Manchmal ist es angebracht, die Regressionsgerade durch den Ursprung zu legen, wenn x {\displaystyle x} und y {\displaystyle y} als proportional angenommen werden. Auch in diesem Spezialfall lässt sich die Kleinste-Quadrate-Schätzung anwenden. Sie liefert fßr die Steigung
β β ~ ~ 1 = â â i = 1 n x i y i â â i = 1 n x i 2 {\displaystyle \textstyle {\tilde {\beta }}_{1}={\frac {\textstyle \sum \nolimits _{i=1}^{n}x_{i}y_{i}}{\textstyle \sum \nolimits _{i=1}^{n}x_{i}^{2}}}} .
Dieser Schätzer fĂźr den Steigungsparameter β β ~ ~ 1 {\displaystyle {\tilde {\beta }}_{1}} entspricht dem Schätzer fĂźr den Steigungsparameter β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} , dann und nur dann wenn x ÂŻ ÂŻ = 0 {\displaystyle {\overline {x}}=0} . Wenn fĂźr den wahren Achsenabschnitt β β 0 â â 0 {\displaystyle \beta _{0}\neq 0} gilt, ist β β ~ ~ 1 {\displaystyle {\tilde {\beta }}_{1}} ein verzerrter Schätzer fĂźr den wahren Steigungsparameter β β 1 {\displaystyle \beta _{1}} . FĂźr die lineare Einfachregression durch den Ursprung muss ein anderes BestimmtheitsmaĂ definiert werden, da das gewĂśhnliche BestimmtheitsmaĂ bei einer Regression durch den Ursprung negativ werden kann (siehe BestimmtheitsmaĂ#Einfache lineare Regression durch den Ursprung).cite-ref-23[23] Die Varianz von β β ^ ^ 1 {\displaystyle {\hat {\beta }}_{1}} ist gegeben durch
Var ⥠⥠( β β ^ ^ 1 ) = Ď Ď 2 â â i = 1 n x i 2 {\displaystyle \operatorname {Var} ({\hat {\beta }}_{1})={\frac {\sigma ^{2}}{\textstyle \sum \nolimits _{i=1}^{n}x_{i}^{2}}}} .
Diese Varianz wird minimal wenn die Summe im Nenner maximal wird.
Matrixschreibweise
Der Modellcharakter des einfachen linearen Regressionsmodells wird besonders in der Matrixschreibweise mit der Datenmatrix deutlich:
y = X β β + ξ ξ {\displaystyle \mathbf {y} =\mathbf {X} {\boldsymbol {\beta }}+{\boldsymbol {\varepsilon }}} (wahres Modell).
mit
( y 1 y 2 ⎠⎠y n ) = ( 1 x 1 1 x 2 ⎠⎠⎠⎠1 x n ) ( β β 0 β β 1 ) + ( ξ ξ 1 ξ ξ 2 ⎠⎠ξ ξ n ) {\displaystyle {\begin{pmatrix}y_{1}\\y_{2}\\\vdots \\y_{n}\end{pmatrix}}={\begin{pmatrix}1&x_{1}\\1&x_{2}\\\vdots &\vdots \\1&x_{n}\end{pmatrix}}{\begin{pmatrix}\beta _{0}\\\beta _{1}\end{pmatrix}}+{\begin{pmatrix}\varepsilon _{1}\\\varepsilon _{2}\\\vdots \\\varepsilon _{n}\end{pmatrix}}}
Diese Darstellung erleichtert die Verallgemeinerung auf mehrere EinflussgrĂśĂen (multiple lineare Regression).cite-ref-24[24]
Verhältnis zur multiplen linearen Regression
Die lineare Einfachregression ist ein Spezialfall der multiplen linearen Regression. Das multiple lineare Regressionsmodell
y i = β β 0 + β β 1 x i 1 + β β 2 x i 2 + ⌠⌠+ β β k x i k + ξ ξ i = x i ⤠⤠β β + ξ ξ i i = 1 , ⌠⌠, n {\displaystyle y_{i}=\beta _{0}+\beta _{1}x_{i1}+\beta _{2}x_{i2}+\ldots +\beta _{k}x_{ik}+\varepsilon _{i}=\mathbf {x} _{i}^{\top }{\boldsymbol {\beta }}+\varepsilon _{i}\quad i=1,\ldots ,n} ,
ist eine Verallgemeinerung der linearen Einfachregression bzgl. der Anzahl der Regressoren. Hierbei ist p = k + 1 {\displaystyle p=k+1} die Anzahl der Regressionsparameter. FĂźr p = 2 {\displaystyle p=2} , ergibt sich die lineare Einfachregression.
Lineare Einfachregression in R
Als einfaches Beispiel wird der Korrelationskoeffizient zweier Datenreihen berechnet:
# Groesse wird als numerischer Vektor
# durch den Zuweisungsoperator "<-" definiert:
Groesse <- c(176, 166, 172, 184, 179, 170, 176)
# Gewicht wird als numerischer Vektor definiert:
Gewicht <- c(65, 55, 67, 82, 75, 65, 75)
# Berechnung des Korrelationskoeffizienten nach Pearson mit der Funktion "cor":
cor(Gewicht, Groesse, method = "pearson")
Das Ergebnis lautet 0.9295038.
Mithilfe der Statistiksoftware R kann eine lineare Einfachregression durchgefßhrt werden. Dies kann in R durch die Funktion lm ausgefßhrt werden, wobei die abhängige Variable von den unabhängigen Variablen durch die Tilde getrennt wird. Die Funktion summary gibt die Koeffizienten der Regression und weitere Statistiken hierzu aus:
# Lineare Regression mit Gewicht als Zielvariable
# Ergebnis wird als reg gespeichert:
reg <- lm(Gewicht~Groesse)
# Ausgabe der Ergebnisse der obigen linearen Regression:
summary(reg)
Diagramme lassen sich einfach erzeugen:
# Streudiagramm der Daten:
plot(Gewicht~Groesse)
# Regressionsgerade hinzufĂźgen:
abline(reg)
Weblinks
Wikibooks: EinfĂźhrung in die Regressionsrechnung
â Lern- und Lehrmaterialien
Commons
: Lineare Regression
â Sammlung von Bildern, Videos und Audiodateien
Literatur
⢠George G. Judge, R. Carter Hill, W. Griffiths, Helmut Lßtkepohl, T.C. Lee. Introduction to the Theory and Practice of Econometrics. John Wiley & Sons, New York, Chichester, Brisbane, Toronto, Singapore, ISBN 978-0-471-62414-1, second edition 1988.
⢠Norman R. Draper, Harry Smith: Applied Regression Analysis. Wiley, New York 1998.
⢠Ludwig von Auer: Ăkonometrie. Eine EinfĂźhrung. Springer, ISBN 978-3-642-40209-8, 6. durchges. u. aktualisierte Aufl. 2013
⢠Ludwig Fahrmeir, Thomas Kneib, Stefan Lang, Brian Marx: Regression: models, methods and applications. Springer Science & Business Media, 2013, ISBN 978-3-642-34332-2
⢠Peter SchĂśnfeld: Methoden der Ăkonometrie. Berlin / Frankfurt 1969.
⢠Dieter Urban, Jochen Mayerl: Regressionsanalyse: Theorie, Technik und Anwendung. 2., ßberarb. Auflage. VS Verlag, Wiesbaden 2006, ISBN 3-531-33739-4.
Einzelnachweise
cite-note-22. â W. Zucchini, A. Schlegel, O. NenadĂc, S. Sperlich: Statistik fĂźr Bachelor- und Masterstudenten.
cite-note-auer49-33. â Ludwig von Auer: Ăkonometrie. Eine EinfĂźhrung. Springer, ISBN 978-3-642-40209-8, 6., durchges. u. aktualisierte Auflage. 2013, S. 49.
cite-note-jw-44. â Jeffrey Marc Wooldridge: Introductory econometrics: A modern approach. 5. Auflage. Nelson Education 2015, S. 59.
cite-note-55. â Karl Mosler und Friedrich Schmid: Wahrscheinlichkeitsrechnung und schlieĂende Statistik. Springer-Verlag, 2011, S. 292.
cite-note-66. â Jeffrey Marc Wooldridge: Introductory econometrics: A modern approach. 5. Auflage. Nelson Education 2015, S. 24.
cite-note-wooldridge-77. â Jeffrey Wooldridge: Introductory Econometrics: A Modern Approach. 5. internationale Auflage. South-Western, Mason, OH 2013, ISBN 978-1-111-53439-4, S. 113â114 (englisch).
cite-note-88. â J. F. Kenney, E. S. Keeping: Linear Regression and Correlation. In: Mathematics of Statistics. Pt. 1, 3. Auflage. Van Nostrand, Princeton, NJ 1962, S. 252â285.
cite-note-99. â Rainer Schlittgen: Regressionsanalysen mit R. 2013, ISBN 978-3-486-73967-1, S. 4 (abgerufen Ăźber De Gruyter Online).
cite-note-1010. â arg ⥠⥠min ( â
â
) {\displaystyle \arg \min(\cdot )} bezeichnet analog zu arg ⥠⥠max ( â
â
) {\displaystyle \arg \max(\cdot )} (Argument des Maximums) das Argument des Minimums
cite-note-1111. â Manfred Precht und Roland Kraft: Bio-Statistik 2: HypothesentestsâVarianzanalyseâNichtparametrische StatistikâAnalyse von KontingenztafelnâKorrelationsanalyseâRegressionsanalyseâZeitreihenanalyseâProgrammbeispiele in MINITAB, STATA, N, StatXact und TESTIMATE: 5., vĂśllig Ăźberarb. Aufl. Reprint 2015, De Gruyter, Berlin Juni 2015, ISBN 978-3-486-78352-0 (abgerufen Ăźber De Gruyter Online), S. 299.
cite-note-1212. â Rainer Schlittgen: Regressionsanalysen mit R. 2013, ISBN 978-3-486-73967-1, S. 27 (abgerufen Ăźber De Gruyter Online).
cite-note-1313. â Werner Timischl: Angewandte Statistik. Eine EinfĂźhrung fĂźr Biologen und Mediziner. 2013, 3. Auflage, S. 326.
cite-note-1414. â Werner Timischl: Angewandte Statistik. Eine EinfĂźhrung fĂźr Biologen und Mediziner. 2013, 3. Auflage, S. 326.
cite-note-1515. â George G. Judge, R. Carter Hill, W. Griffiths, Helmut LĂźtkepohl, T. C. Lee. Introduction to the Theory and Practice of Econometrics. 2. Auflage. John Wiley & Sons, New York / Chichester / Brisbane / Toronto / Singapore 1988, ISBN 0-471-62414-4, S. 168.
cite-note-1616. â Ludwig Fahrmeir, Rita KĂźnstler, Iris Pigeot, Gerhard Tutz: Statistik. Der Weg zur Datenanalyse. 8., Ăźberarb. und erg. Auflage. Springer Spektrum, Berlin / Heidelberg 2016, ISBN 978-3-662-50371-3, S. 443.
cite-note-1717. â Jeffrey Marc Wooldridge: Introductory econometrics: A modern approach. 5. Auflage. Nelson Education 2015
cite-note-1818. â Karl Mosler und Friedrich Schmid: Wahrscheinlichkeitsrechnung und schlieĂende Statistik. Springer-Verlag, 2011, S. 308.
cite-note-1919. â Werner Timischl: Angewandte Statistik. Eine EinfĂźhrung fĂźr Biologen und Mediziner. 2013, 3. Auflage, S. 313.
cite-note-2020. â Rainer Schlittgen: Regressionsanalysen mit R. 2013, ISBN 978-3-486-73967-1, S. 13 (abgerufen Ăźber De Gruyter Online).
cite-note-2121. â Ludwig von Auer: Ăkonometrie. Eine EinfĂźhrung. Springer, ISBN 978-3-642-40209-8, 6., durchges. u. aktualisierte Auflage. 2013, S. 135.
cite-note-2222. â Walter Gellert, Herbert KĂźstner, Manfred Hellwich, Herbert Kästner (Hrsg.): Kleine Enzyklopädie Mathematik. Leipzig 1970, S. 669â670.
cite-note-2323. â Jeffrey Marc Wooldridge: Introductory econometrics: A modern approach. 4. Auflage. Nelson Education, 2015, S. 57.
cite-note-2424. â Lothar Sachs, JĂźrgen Hedderich: Angewandte Statistik: Methodensammlung mit R. 8., Ăźberarb. und erg. Auflage. Springer Spektrum, Berlin / Heidelberg 2018, ISBN 978-3-662-56657-2, S. 801